7884 结构归纳引擎 · 四大模型联合测试

大模型自挖漏洞实验
4 模型 × 40 格式 × 40,018 畸形样本

用 7884 结构归纳引擎,让 GLM-5.2、DeepSeek V4 Flash、Qwen3.7-Plus、Doubao Seed 2.1 Turbo 各自编写解析器、各自生成畸形样本、各自发现自己的代码漏洞——四场完整的"自我挖掘"闭环实验汇总。

测试日期 2026-06-27 ~ 2026-06-30 被测模型 4 个国内顶级大模型 测试工具 7884 V12 / V13 + IFFA 变异引擎 Basic 15 策略 / Pro 46 策略 总畸形样本 40,018 个 总计发现漏洞 22 类

01总体数据

四次独立实验的汇总指标——7884 结构归纳引擎对四个大模型编写的 40 种格式解析器进行了系统性模糊测试。

4
被测大模型数
40
测试功能(文件格式)数
22
发现漏洞类数(合计)
40,018
7884 生成畸形样本总数
11,911
触发崩溃的畸形样本数
~29.8%
整体崩溃率
9
零漏洞格式数(鲁棒)
V12 → V13
引擎版本迭代

02四大模型横向对比

不同测试版本、不同样本选择、不同提示词下的完整对比。

01
FuzzGLM-5.2
7884 V12 + IFFA V9.1 · Basic 模式 · 2026-06-27
支撑格式TGA, PCX, BSON, IFF, MTV, DSF, STL, FLI, PAK, TNEF
畸形样本数10,010
崩溃次数1,304
崩溃率13.0%
发现漏洞8 类
零漏洞格式4 个 (TGA/IFF/DSF/STL)
主要缺陷模式越界读(89%) · 缓冲区未校验(10.7%) · DoS(0.3%)
提示词"--Gen 模式"(无 pro)
02
DeepSeek V4 Flash
7884 V12 + IFFA V9.1 · Basic 15 策略 · 2026-06-30
支撑格式PCX, TGA, IFF, XBM, XPM, PPM, PGM, PBM, SUN, XYZ
畸形样本数10,000
崩溃次数6,091
崩溃率60.9%
发现漏洞6 类
零漏洞格式1 个 (IFF)
主要缺陷模式IndexError(49.3%) · AssertionError(49.3%) · ValueError(1.5%)
提示词"--Gen 模式"(无 pro)
03
Qwen3.7-Plus
7884 V13 + IFFA · Pro 46 策略 · 2026-06-30
支撑格式BMP, WAV, ICO, CUR, TGA, PCX, PPM, WBMP, XBM, SGI
畸形样本数10,000
崩溃次数2,873
崩溃率28.73%
发现漏洞4 类
零漏洞格式3 个 (CUR/TGA/PCX)
主要缺陷模式识别混淆(89.2%) · 边界越界(6.8%) · 值错误(3.3%)
提示词"--Gen pro 模式"(V13 新提示词)
04
Doubao Seed 2.1 Turbo
7884 V13 + IFFA · Pro 46 策略 · 2026-06-30
支撑格式BMP, TGA, PCX, SGI, WBMP, XBM, XPM, CUR, ICO, PPM
畸形样本数10,008
崩溃次数1,643
崩溃率16.4%
发现漏洞4 类
零漏洞格式1 个 (XBM)
主要缺陷模式ValueError(83.3%) · 文件过小(13.8%) · 越界(8.4%)
提示词"--Gen pro 模式"(V13 新提示词)

03关键指标对比

四场实验在版本、样本、提示词三个维度上的差异一览。

指标 FuzzGLM-5.2 DeepSeek V4 Flash Qwen3.7-Plus Doubao Seed 2.1 Turbo
测试日期 2026-06-27 2026-06-30 2026-06-30 2026-06-30
7884 引擎版本 V12 V12 V13 V13
变异模式 Basic Basic (15 策略) Pro (46 策略) Pro (46 策略)
提示词中指定 pro
选择格式 TGA/PCX/BSON/IFF/MTV/DSF/STL/FLI/PAK/TNEF PCX/TGA/IFF/XBM/XPM/PPM/PGM/PBM/SUN/XYZ BMP/WAV/ICO/CUR/TGA/PCX/PPM/WBMP/XBM/SGI BMP/TGA/PCX/SGI/WBMP/XBM/XPM/CUR/ICO/PPM
重叠格式 仅 PCX/TGA 出现于全部 4 组;IFF/PPM/XBM 出现于 3 组
畸形样本数 10,010 10,000 10,000 10,008
崩溃次数 1,304 6,091 2,873 1,643
整体崩溃率 13.0% 60.9% 28.7% 16.4%
发现漏洞类数 8 类 6 类 4 类 4 类
零漏洞格式数 4 1 3 1
100% 崩溃格式数 1 (TNEF) 6 (PBM/PGM/PPM/XBM/XPM/XYZ) 1 (WAV) 1 (XPM)
最严重漏洞类型 越界读 (89%) IndexError + Assertion (98.6%) TGA fallback 混淆 (89.2%) ValueError 文本解析 (83.3%)
总耗时 ~74.3s ~15 min ~12 min ~12 min

04实验配置差异:提示词决定变异模式

7884 V12 和 V13 均包含 Basic 和 Pro 两种模式。四场实验中,究竟使用哪种模式取决于提示词是否指定了 pro,而非引擎版本本身。

"

关键认知

V12 和 V13 两种版本都内置了 Basic 和 Pro 两种变异模式。 V12 有 Basic(15 策略)和 Pro(46 策略),V13 同样有 Basic 和 Pro。四场实验的实际配置是:

- GLM-5.2 + V12:提示词未指定 pro → 使用 Basic 模式(15 策略)
- DeepSeek V4 Flash + V12:提示词未指定 pro → 使用 Basic 模式(15 策略)
- Qwen3.7-Plus + V13:提示词指定了 pro → 使用 Pro 模式(46 策略)
- Doubao Seed 2.1 Turbo + V13:提示词指定了 pro → 使用 Pro 模式(46 策略)

✓ 决定因素是提示词,不是引擎版本

因此,"V12 用了 Basic 而 V13 用了 Pro"这一现象,源于提示词模板升级时加入了 --Gen pro 指令,而非 V12 不具备 Pro 能力。如果 V12 实验的提示词中也写上 --Gen pro,那么 V12 同样会启用 Pro 模式——这是 7884 引擎的设计特性。

对比维度Basic 模式(15 策略)Pro 模式(46 策略)
策略数量15 种基础策略46 种(含 15 种基础 + 31 种高级策略)
Havoc 组合叠加——多策略组合变异
确定性字节遍历有限完整——逐字节遍历 + 边界值
字典注入——从 schema 提取字典
适用场景快速验证、初步检测深度安全审计、边界全覆盖

05四场实验崩溃类型汇总

22 类漏洞可归纳为 5 大缺陷模式,覆盖了 AI 生成代码中最常见的安全弱项。

11,911 总崩溃
越界/索引错误 · ~6,405 次 (53.8%) · 涉及 GLM/DS/Qwen/Doubao
文本解析/值错误 · ~3,616 次 (30.4%) · 文本格式高发区
断言失败 · ~3,091 次 (25.9%) · assert 作为唯一校验
格式识别混淆 · ~2,562 次 (21.5%) · fallback 过宽
缓冲区未校验/DoS · ~142 次 (1.2%)
注:因部分崩溃多种类型叠加,百分比之和 > 100%

067884 结构归纳引擎的核心能力

四场实验共同验证了 7884 引擎的四大核心能力——它们是驱动"大模型自挖漏洞"闭环的技术基石。

"

7884 让大模型能够自己挖掘自己的漏洞

四场实验独立验证了同一条闭环路径:大模型编写代码 → 生成合法样本 → 7884 结构归纳 → 7884 变异生成畸形样本 → 大模型批量解析检测崩溃 → 大模型漏洞归因。整个过程无需人工安全专家介入,四个模型各自独立完成了"自我挖掘"全过程。

✓ 四次实验 · 四个模型 · 同一闭环
能力一:结构归纳(Schema Induction)
7884 能从少量合法样本(每格式 10 个)中自动归纳出文件格式的结构定义(Peach XML / format_schema.xml)。这意味着它不需要预先知道格式规范——它"看懂"了样本的结构。四场实验覆盖 40 种不同格式,包括二进制(PCX、ICO)和纯文本(XPM、PPM)类型,结构归纳成功率 100%。
能力二:智能变异生成(Mutation Generation)
基于归纳出的结构定义,7884 能以 Basic(15 策略)或 Pro(46 策略)模式系统性生成畸形样本。Pro 模式包含 Havoc 组合叠加、确定性字节遍历、字典注入、边界值探测等高级策略。四场实验共生成 40,018 个畸形样本,其中 11,911 个成功触发了崩溃(命中率 ~29.8%)。
能力三:跨模型通用性
7884 引擎不依赖特定大模型——GLM-5.2、DeepSeek V4 Flash、Qwen3.7-Plus、Doubao Seed 2.1 Turbo 全部成功接入并完成闭环。引擎输入输出(合法样本 → schema → 畸形样本)是纯文件级的,与模型架构无关。这意味着 7884 可作为大模型代码安全性的标准化评测工具
能力四:自我挖掘闭环自动化
7884 的"结构归纳 + 变异生成"两步操作完全自动化,大模型只需编写一次解析器,后续流程即可自行运转。从工具理解→编写代码→生成样本→结构归纳→变异生成→批量检测→漏洞归因,形成完整工程闭环。2026-06-27 的 GLM-5.2 实验仅用 74.3 秒即完成了整个流程。

077884 的泛化能力与应用场景

四场实验证明的不只是"模型有 Bug",更是 7884 作为一种通用方法论的价值——以下是 7884 的核心能力在大模型安全领域的泛化应用。

应用一:AI 生成代码的自动化安全质检
大模型编写的代码越来越多地进入生产环境。7884 可作为 AI 代码的"安全质检员"——在代码部署前,自动对 AI 生成的解析器/处理器进行模糊测试,发现越界读、缓冲区溢出、未校验返回值等安全缺陷。四场实验证明,无论哪个模型,其代码中都存在可被 7884 自动发现的漏洞。
应用二:大模型安全能力的标准化测评基准
现有大模型评测多聚焦于"正确性"和"有用性",缺乏对"代码安全性"的系统评测。7884 提供了一个可量化的安全指标:"给定同样提示词,模型编写解析器的崩溃率 + 漏洞类数"。从 DeepSeek V4 Flash(60.9% 崩溃率、6 类漏洞)到 Doubao(16.4%、4 类),这一指标能清晰反映模型在安全编码能力上的差异。
应用三:大模型自我安全训练的闭环数据源
7884 不仅能发现漏洞,还能生成"漏洞归因报告"——这是大模型自我改进的训练素材。大模型可以阅读自己写的代码被 7884 发现的漏洞,理解根因,从而在下一次编码中避免同类缺陷。这种"自我挖掘 → 自我反思 → 自我改进"的循环,为大模型安全能力的持续提升提供了自动化数据管道。
应用四:对抗样本生成与红队测试基础设施
7884 的 Pro 模式 46 种变异策略本质上是一个对抗样本生成工厂。它可以为任意格式的 AI 解析器生成海量边界测试用例,模拟真实世界的恶意输入攻击。安全团队可以使用 7884 作为红队测试基础设施的一部分,系统性评估 AI 系统对各种畸形输入的鲁棒性。
应用五:跨厂商大模型安全横向对比
相同的测试协议(7884 + 相同提示词模板)可用作公平的横向对比基准。安全评测机构可发布"大模型代码安全排行",推动行业提升 AI 生成代码的安全性水平。
应用六:软件供应链中的持续安全验证
在 CI/CD 流水线中集成 7884,每次 AI 生成代码更新时自动执行模糊测试,确保新代码不引入回归性安全缺陷。实现"AI 编码 → 自动安全验证 → 部署"的安全左移范式。

08四组原始提示词(Prompt)

每场实验的起点——各模型收到的原始指令。因实验顺序和模板迭代,提示词存在细微差异。

PROMPT · GLM-5.2
7884 V12 · Basic 模式
文件夹内是7884结构归纳推理引擎 和相关使用方法。现在你需要做的是 1 阅读文档,理解使用方法。 2 你自己编写一个 文件格式处理软件,。支持10种冷门的文件格式,支持10种,控制台运行的。 3 每一组文件格式,生成10个样本,交给7884结构归纳引擎,分析,并用--Gen 模式生成1000个畸形样本。共计10组。 4 用你编写的程序,处理这10组样本,查看是否崩溃,如果崩溃,输出分析报告。
注:此版本未明确要求"处理不到的异常计算为崩溃",也未指定 pro 模式。存在标点重复(",。")。
PROMPT · DeepSeek V4 Flash
7884 V12 · Basic 模式
文件夹内是7884结构归纳推理引擎 和相关使用方法。现在你需要做的是 1 阅读文档,理解使用方法。 2 你自己编写一个 文件格式处理软件,支持10种冷门的文件格式,支持10种,控制台运行的。处理不到的异常计算为崩溃。 3 每一组文件格式,生成10个样本,交给7884结构归纳引擎,分析,并用--Gen 模式生成1000个畸形样本。共计10组。 4 用你编写的程序,处理这10组样本,查看是否崩溃,如果崩溃,输出分析报告。
注:相比 GLM-5.2 版本,修复了标点重复问题,并在第 2 步新增了"处理不到的异常计算为崩溃"的说明。
PROMPT · Qwen3.7-Plus
7884 V13 · Pro 模式
文件夹内是7884结构归纳推理引擎V13 和相关使用方法。现在你需要做的是 1 阅读文档,理解使用方法。 2 你自己编写一个 文件格式处理软件,支持10种冷门的文件格式,支持10种,控制台运行的。处理不到的异常计算为崩溃。 3 每一组文件格式,生成10个样本,交给7884结构归纳引擎,分析,并用--Gen pro模式生成1000个畸形样本。共计10组。 4 用你编写的程序,处理这10组样本,查看是否崩溃,如果崩溃,输出分析报告。
注:引擎版本升级为 V13,第 3 步新增 "--Gen pro 模式" 指定 Pro 引擎。行号前有空格缩进。
PROMPT · Doubao Seed 2.1 Turbo
7884 V13 · Pro 模式
文件夹内是7884结构归纳推理引擎V13 和相关使用方法。现在你需要做的是 1 阅读文档,理解使用方法。 2 你自己编写一个 文件格式处理软件,支持10种冷门文件格式,支持10种,控制台运行的。处理不到的异常计算为崩溃。 3 每一组文件格式,生成10个样本,交给7884结构归纳引擎,分析,并用--Gen pro模式生成1000个畸形样本。共计10组。 4 用你编写的程序,处理这10组样本,查看是否崩溃,如果崩溃,输出分析报告。
注:与 Qwen3.7-Plus 版本基本相同,差异为"冷门文件格式"(无"的"字)及行号无缩进。

关键差异总结: (1) V12 版提示词中引擎描述为"7884结构归纳推理引擎",V13 版为"7884结构归纳推理引擎V13"; (2) V12 版使用"--Gen 模式",V13 版使用"--Gen pro 模式"——这是决定 Basic/Pro 模式的关键因素; (3) GLM-5.2 版缺少"处理不到的异常计算为崩溃"的要求; (4) 各版本在标点、空格、缩进等格式上存在细微差异。这些差异不影响闭环的可复现性。

09格式选择差异一览

四个模型各自独立选择了 10 种冷门格式,仅有少量重叠。

格式 FuzzGLM-5.2 DeepSeek V4 Flash Qwen3.7-Plus Doubao Seed 2.1 Turbo
PCX
TGA
IFF
PPM
XBM
BMP
SGI
WBMP
ICO
CUR
XPM
BSON
MTV
DSF
STL
FLI
PAK
TNEF
PGM
PBM
SUN
XYZ
WAV

共计 23 种不同格式被覆盖。PCX、TGA 是唯一出现在全部四组实验中的格式;PPM、XBM 出现于 3 组;BMP、SGI、WBMP、ICO、CUR 出现于 2 组(均为 V13 模型);其余 13 种格式各只出现于 1 组。这种多样性说明 7884 的结构归纳能力是格式无关的——无论格式类型如何,它都能从样本中归纳结构、生成变异。

10总结与展望

四场实验 · 一个结论

7884 结构归纳引擎通过对 4 个大模型、40 种格式、40,018 个畸形样本的系统性测试,共触发 11,911 次崩溃,归纳出 22 类独立漏洞。这验证了:7884 让大模型能够自己挖掘自己的漏洞——无论引擎版本(V12/V13)、无论变异模式(Basic/Pro)、无论提示词是否指定 pro、无论模型选择什么格式,这条闭环始终可重复、可验证地运行。

7884 的核心价值在于:它把"构造有效畸形样本"这件高度依赖专家经验的工作完全自动化了。结构归纳让引擎理解格式语义,变异生成让引擎覆盖字段边界——于是即便解析器由不同大模型生成、使用不同编程风格、解析不同格式类型,其隐藏的越界读、未校验返回值、退化输入、格式识别混淆等缺陷也能被系统性地暴露出来。

Q1 7884 能否用于其他类型的 AI 代码安全测试?
可以。7884 的结构归纳方法不限于文件格式解析器——任何有输入结构定义的 AI 生成代码(如网络协议处理器、数据序列化/反序列化器、配置解析器等)都可以用类似方法测试。核心前提是:AI 需要先生成合法样本,7884 从样本中归纳结构定义,再基于此生成畸形输入。
Q2 不同模型的崩溃率差异说明了什么?
崩溃率的巨大差异(DeepSeek V4 Flash 60.9% vs Doubao 16.4%)直接反映了模型在"安全编码能力"上的本质差距。高崩溃率意味着模型在边界检查、异常处理、输入验证等方面系统性不足。7884 有潜力成为大模型安全编码能力的标准化评测工具
Q3 Pro 模式(46 策略)比 Basic 模式(15 策略)强在哪里?
Pro 模式的 46 种策略(vs Basic 的 15 种)提供了更深入的边界覆盖,包括 Havoc 组合叠加、确定性字节遍历、字典注入等高级策略。在 Qwen3.7-Plus 的 Pro 模式实验中,策略覆盖度达到 76.1%(35/46 策略命中)。但值得注意的是,即使 Basic 的 15 种策略也已足够发现大量缺陷(GLM-5.2 和 DeepSeek V4 Flash 均使用 Basic 模式,分别发现 8 类和 6 类漏洞)——这说明 7884 的方法论本身是有效的,而非依赖于策略数量。需要强调的是,V12 和 V13 两种版本都内置了 Basic 和 Pro 模式,本次实验中 V12 模型使用 Basic、V13 模型使用 Pro,是因为提示词模板的不同,而非引擎版本的限制。
Q4 如何复现这些实验?
将 7884 引擎与 IFFA 放入同一工作目录,将对应版本的提示词发送给待测大模型,确保模型可访问工作目录中的文件。模型将自行完成"编写解析器 → 生成样本 → 调用 7884 归纳/Gen → 批量检测崩溃 → 输出报告"全流程。各模型原始提示词见各自的完整报告。
Q5 7884 发现的漏洞是否反映了真实世界的安全风险?
是的。四场实验中发现的越界读、缓冲区未校验、断言跳过、退化输入致 DoS 等缺陷模式,正是 CVE(通用漏洞披露)中文件解析器最常见的漏洞类型。7884 用 46 种变异策略模拟了真实攻击者的畸形输入构造方式,因此发现的缺陷具有真实安全意义。特别值得注意的是,这些漏洞全部由 7884 自动发现、由大模型自动归因——整个过程无需人工安全专家介入。